从生成一段视频,到生成一场互动。
作者|Moonshot
编辑|郑玄
你见过能实时互动的 AI 视频吗?
跟着小狐狸游览景色,你询问它接下来的计划,它会马上带你看附近的景色,会拿着旅游地图,边走边指着身旁的风景讲解给你听。
这不是一段提前录好的视频。屏幕里的小狐狸,是由 Vivix-A1 实时生成的 AI 角色。用户说出的指令,会直接改变它接下来讲什么、做什么。
7 月 24 日,成立一年多的 AI 公司 Vivix 发布两款激活参数约 30B 的实时交互多模态模型 A1 和 W1。这也是全球首个集合了多模态参考、原生交互以及流式视频生成的基座模型。更值得关注的是速度和成本:据其官方报告给出的可见反应延迟低于 0.6 秒,计入网络传输和直播推流后,端到端 TTFR(首次反应延迟)低于 1.7 秒;团队的实时视频推理成本在过去一年内降低 2 个数量级,已接近主流视频平台每小时 CDN 带宽成本量级。这些数据意味着,实时交互多模态技术终于可以走出实验室,走进真实世界,最终来到每一个用户身边。
Vivix 想推动 AI 视频从生成「一段固定的内容」,走向生成「一场持续的互动体验」。
这是 Vivix 对下一代 AI 内容的判断,也是它同时推出 A1、W1 和 API 平台的起点。
01
Vivix-A1:
从「会说话」到「会行动」
Vivix 将 A1 定义为首个面向交互式 AI 角色的实时全双工模型。它要解决的问题很直接:让 AI 角色不再只是「固定画面里一张会说话的脸」,而是成为能够「边听、边说、边行动的完整生命」。
常见的 talking avatar,本质上是一张会说话的脸:先生成语音,再让嘴型跟上。Vivix-A1 则把角色从一张脸扩展到完整的身体。它不仅能感知周围环境,还能走动、拿取物品,完成各种全身表演。
具体来看,A1 的能力主要体现在四个方面。
角色可以走动、拿东西,也能完成全身表演
线上看房场景中,AI销售可以带你看房子的构造、自然走出房间对外观进行展示,镜头也会跟随角色移动。角色不再只能面对固定镜头介绍产品,整场讲解可以跟着他的行动自然展开。
露营场景中,AI 向导会根据用户的问题,随即拿起一盏露营灯,边展示边讲解。物品可以随着对话自然进入场景,角色也能通过实际的拿取动作回应。
小狐狸导览、房产销售和露营三个场景,分别展示了 A1 的全身表演、物体交互和空间移动能力。A1 要解决的,是让 AI 角色不只听懂用户的要求,还能调动全身,用行动作出回应。
用户随时插话,角色随时回应
A1 支持实时全双工交互。即使角色正在说话或行动,用户依然可以插话、追问或更换话题,不必等它完成这一轮表演。
用户之外,周围环境也会影响角色。风声、雷声等声音可以直接进入模型,改变角色接下来的表情和动作。角色开始知道身边发生了什么,也会根据新的情况作出反应。
自然的表情与丰富的情绪
角色是否具有「活人感」,不只看脸做得够不够真实,更要看它的表情、声音和动作,能不能随着对话自然变化。
A1 可以同时生成表情、声音、手势和全身动作。角色开心、惊讶或生气时,变化会落在眉毛、额头、眼神和嘴角,也会反映在语气和身体姿态上。
这些细节会跟着对话实时变化。角色的情绪不再是一套提前准备好的表情,而是在对话发生的当下,通过表情、声音和动作自然呈现出来。
Vivix 官网对 A1 的介绍把微表情、视线、手势和全身运动的协同列为模型的重要能力。这种表演能力可以覆盖写实人物、3D 角色和动漫形象。
互动过程中,也能动态加入新的图片
A1 支持语音、文字和图片输入。图片不只负责确定角色最初的样子,也可以在互动过程中继续加入素材。
用户临时上传一张商品图,角色可以根据新的图片调整讲解,把商品带进场景,再完成拿取和展示。整个过程接在当前视频后面,不需要重新开始生成。
这些能力为什么能同时发生
常见的 AI 角色系统,会让语音识别、语言模型、语音合成和视频驱动依次工作。一个环节完成后,下一个环节才开始。链路越长,角色越难在行动过程中及时接收新的要求。
A1 没有把这些环节简单串在一起。Vivix 为它设计了一套原生多模态生成循环,让模型持续处理声音、图片和交互信息,同时生成相应的声音与画面。
Director Agent 像一个实时导演,负责判断角色接下来要说什么、做什么,同时记住此前的对话和场景状态。用户中途换了问题,角色可以从当前状态继续回应。
视频则采用流式生成。模型不会等整段视频全部完成,而是每次向前生成一小段,再让下一段沿着已经发生的内容继续生成。为了避免片段之间出现跳变,也防止人物和场景在长时间生成中逐渐偏移,A1 使用局部连续性保证前后片段自然衔接,再通过全局序列先验维持人物、背景、声音和动作的长期一致。多维联合蒸馏则把推理过程压缩到两步,进一步降低实时生成所需的计算量。
A1 先把实时交互放到一个角色身上。Vivix-W1 再把这套能力扩展到整个场景和故事。
02
Vivix-W1:
当用户开始实时改变整个故事
A1 让一个角色根据用户的要求继续行动。W1 再往外走了一步,把变化扩展到人物、物体、场景、镜头、声音和事件。
在 W1 的互动叙事体验中,用户输入「外星人入侵地球」的 Prompt,画面中随即依次出现太空指挥部、太空和民众视角的不同场景,氛围紧张、镜头切换自然。
W1 最值得关注的地方,是它把过去通常分开处理的几项能力,放进了同一个流式模型:
「原生音画联合生成」让画面、对白、环境音和音效一起生成。画面里开始下雨,声音也会同时发生变化,不需要再由另一个音频模型单独补上。
「多模态参考」让文字、图片、音频和视频都能成为内容生成的依据,并共同影响最终呈现。这些信息既可以确定故事的开场,也可以在故事进行到一半时加入。用户上传一张新图片,或者通过点击选择一个物体,后续内容会从当前状态继续改变。
「原生多镜头叙事」负责组织镜头。故事转向其他人物或场景时,模型可以切换视角、移动镜头,并继续处理对白节奏和人物反应。用户改变的不只是画面里的某个元素,故事的讲述方式也会随之变化。
故事一直生成,怎么保证它不越跑越偏
W1 不需要等整段视频生成完成,而是以流式方式,一小段一小段地持续向前生成。上一段内容会成为下一段的基础;用户中途加入的语音、图片、触控或镜头操作,也能继续改变后面的故事。
这种方式需要同时解决两个问题:既要让每一段生成得足够快,也要避免时间一长,人物、场景和声音越跑越偏。
Vivix 为此设计了 Vivix-Turbo。它通过「超低步数蒸馏」减少每一段音视频所需的推理步骤,再通过镜头规划和时间连续性优化,保持人物、场景和镜头的稳定。
模型生成得快,并不代表用户马上就能看到变化。一条新指令还要经过处理、生成和传输,才会变成屏幕里的画面和声音。
因此,Vivix 又为 A1 和 W1 搭建了实时推理系统 Vivix Infra。它让输入处理、音视频生成、解码和推流同时运行。模型生成当前画面时,系统也能继续接收用户的新要求。
用户中途改变想法,系统会直接调整后续生成。已经发生的内容和上下文会被保留下来,模型无需从头计算。这既能缩短响应时间,也能降低实时视频长期运行的成本。
Vivix-Turbo 提高 W1 的生成速度和稳定性,Infra 则缩短模型响应传到用户屏幕所需的时间。两个技术底座,共同支撑 W1 的实时交互。
03
从一个人,到一段持续生长的内容
Vivix 成立于 2025 年初,目前已经完成 A 轮融资。历史股东包括 IDG、红杉、蓝驰、5Y、Monolith,和战略投资人京东和阿里(按照时间顺序)。
Vivix 瞄准的是那些很难被大量提供的互动体验。今天,一场体验要做到实时回应,通常有两种办法。一种是让真人在线,另一种是由制作团队提前准备内容。前者受限于真人时间,后者受限于内容制作量。Vivix 希望用实时交互模型补上中间的一块。角色可以面对不同用户作出不同回应,故事也可以根据每个人的选择继续发展。制作团队不必提前录完所有内容,真人也不用始终守在屏幕另一端。
而关于「互动」,团队也形成了一个共识:互动是一件很重的事情,它要求用户付出注意力和操作成本,所以必须带来大幅的体验增益——比如游戏,提供更强的沉浸感、更真实的反馈。进一步说,把某种生成能力包装成工具不够,单纯改变交互方式也不够,而必须需要创造一种体验增益足够大的新内容格式。 A1、W1,正是 Vivix 对这一方向给出的探索。
Vivix 对互动的理解,比「用户发出指令,系统给出反馈」多了一层,他们把一场互动拆成三个基本元素:人、场景和时间。
A1 先处理「人」,不是固定机位下的大头数字人,而是让角色能够听懂用户并采取行动;
W1 加入场景和时间,让人物之外的环境和事件也能发生变化;
Infra 则让这些变化及时出现在屏幕上,并控制长期运行所需的成本。
AI 生成的内容不一定只能等待观看,它也可以在用户进入以后,继续生长。
官方现已开放内测,欢迎点击文章底部【阅读原文】访问官网及 API 开放平台申请体验。
*头图来源:Vivix
本文为极客公园原创文章,转载请联系极客君微信 geekparkGO
极客一问
你认为 AI 生成互动视频
最核心的要素是什么?